Continual Learning for Long-Running Agents - Agents That Keep Getting Better - NVIDIA Developer
- aliases
- No value
- tags
- agent ai
- description
- No value
- links
- https://youtu.be/SVWmuJx0hHM
- status
- No value
- project
- false
- area
- true
- resource
- false
- title
- Continual Learning for Long-Running Agents - Agents That Keep Getting Better - NVIDIA Developer
- created
- 2026-07-05T11:05:00
- updated
- 2026-07-12T15:45:20
- 4:24 context rot: 컨텍스트가 쌓이면서부터 에이전틱 성능이 감소하는 현상을 일컫는다. MRCR 벤치마크(긴 텍스트 안에서 정보 찾기), 그래프 기반 태스크 쿼리의 경우, 256K 컨텍스트보다 1M 컨텍스트에서의 성능이 감소함.
- 9:13 context chunking: 단일 대용량 프롬프트를 던지는 것보다 서브태스크별로 파일을 찢어서 에이전트가 그때그때 필요한 컨텍스트를 참조하도록 하라. 서브에이전트에게 일감을 delegation 하는 것이 전체 컨텍스트의 크기를 줄이는 방법이다. Recursive Langage Model 라고도 불리운다.
- 전체 프롬프트를 N개의 청크로 분리한다.
- 각 청크를 서브에이전트들에게 요약을 시킨다.
- 요약 결과본들을 다시 서브에이전트가 읽게 한다.
- 14:11 "So the main issue is that the models are very specific to the harness that you train them on."
- 모델들의 성능은 훈련시킨 하네스에 굉장히 많이 의존한다.
- 15:57 Continual Learning: 사용자와의 대화, tool calling으로부터 전체 trajectory를 백트래킹 하고 다시 하네스를 수정하는 피드백 루프를 일컫는다.
- 💡 만약 에이전트가 context chunk 이후 그것들의 관계를 그래프로 그렸다면 trajectory 하기에도 굉장히 편하지 않을까? 마치 프로젝트 매니저가 회고세션 이후에 티켓 분배/의존성 전략을 다시 수립하는 것처럼.
- 16:53 Prime Intellect: Model-Traning-As-A-Service 플랫폼.